Skip to content

Balancing precision and retention in experimental design

Diaz, Rossiter (2025)

DisciplineSocial science
MethodExperiment
Tagsblock randomizationdata · experimentexperimental designmethod · simulationpretest posttest designsample attritionstatistical power

Summary

Problem: 实验社会科学中,精确估计处理效应至关重要。文献推荐使用区块随机化和前测-后测设计来提高精度,但这些设计需要收集前测协变量,而收集这些信息可能导致样本量减少,从而损害精度。因此,在应用场景中,这些设计何时能真正提高精度尚不明确。 Approach: 作者复制了三项已发表的实验(Dietrich & Hayes 2023;Bayram & Graham 2022;Tappin & Hewitt 2023),将参与者随机分配到标准设计、前测-后测设计、以及前测-后测加区块随机化设计三种反事实设计中,通过模拟隐性和显性样本损失来评估精度变化。 Finding: 精度增益可以承受显著的样本损失。在Bayram & Graham和Tappin & Hewitt的复制中,前测-后测和区块随机化设计即使损失一半样本,精度仍优于或等同于满样本的标准设计。但在Dietrich & Hayes的复制中,由于样本量小且准前测测量与结果相关性弱(r=0.28),前测-后测设计即使无样本损失也表现更差。 Significance: 本文挑战了文献中“应尽可能使用区块随机化和前测-后测设计”的简单建议,表明设计选择应基于具体情境,考虑前测信息是否已可用、统计功效是否充足等因素,为应用研究者提供了更务实的指导。

Theoretical Framework

  • Theoretical tradition: 实验设计方法论,基于Neyman–Rubin潜在结果框架
  • Prior theories built upon: Neyman–Rubin潜在结果框架;Gerber和Green(2012)关于差异均值估计量标准误的公式;Imai, King和Stuart(2008)关于区块随机化的建议;Clifford, Sheagley和Piston(2021)关于重复测量设计的建议;Moore(2012)关于区块随机化在应用场景中提高精度的研究
  • Causal mechanism: 区块随机化通过在预期结果相似的亚组内分配处理,减少潜在结果的方差;前测-后测设计通过利用前测结果测量值在估计中减少结果方差。两者均通过降低方差来提高精度,但样本损失通过增加标准误(因1/√(N−1)因子)来抵消精度增益。
  • Key assumptions: 潜在结果满足SUTVA和可排除性假设;处理是随机分配的;前测信息与潜在结果或后测结果相关;样本损失是随机的(不引入偏误)
  • Theoretical move: 本文挑战并细化现有理论——文献假设样本量不受设计选择影响,本文明确引入显性和隐性样本损失的概念,将实践约束纳入理论考量,扩展了实验设计选择的理论框架。
  • Scope conditions: 研究基于调查实验和一项多波次研究;结论的推广性受限于所复制的三项实验的特征(子领域、实验臂数、样本量、波次等)

Research Design

本研究为复制实验(replication experiment),采用调查实验方法。作者对每项原始研究分别实施三种设计:(1) 标准设计(简单或完全随机化,仅测量后测结果);(2) 前测-后测设计(完全随机化,增加前测结果测量);(3) 前测-后测加区块随机化设计(基于预测性协变量和前测结果进行区块分配)。分析单元为个体参与者。关键自变量为实验设计类型(标准/前测-后测/前测-后测加区块随机化),因变量为处理效应估计的标准误(精度)。操作化方式:通过比较不同设计下估计的ATE标准误相对于标准设计的百分比变化来衡量精度。

Data & Sample

  • 三项复制实验的样本量:DH(标准设计426人,前测-后测427人,前测-后测加区块429人);BG(1,008/1,010/1,006人);TH(751/780/767人)
  • 参与者通过CloudResearch Connect招募
  • DH和BG为单波次调查实验;TH为三波次研究(波次1收集前测协变量,波次2施测处理,波次3测量结果)
  • 数据收集时间未明确说明(论文发表于2025年)
  • 原始研究覆盖美国政治和国际关系子领域

Analytical Strategy

  • 通过模拟评估隐性样本损失:从替代设计中随机删除观测值(0%至50%,每5%递增),重新估计处理效应和标准误,每种样本量进行1,000次随机抽样
  • 比较替代设计(有样本损失)与标准设计(无样本损失)的标准误百分比变化,附95%置信区间
  • 显性样本损失通过比较各设计下参与者流失率来评估
  • 样本组成差异通过检验观测值是否被纳入样本是否被各设计的前测协变量(24个人口统计指标)差异预测来评估
  • 后测流失通过比较各设计的流失率及处理组与对照组间流失差异来评估

Results & Findings

  • 显性样本损失:DH和BG(单波次研究)的显性样本损失很小(每设计<1%),且在各设计间无统计显著差异。TH(多波次研究)的流失率较高——标准设计13.0%、前测-后测14.2%、前测-后测加区块20.7%。区块随机化设计流失更多是因为多元连续区块化不允许区块协变量有缺失值,导致7%的观测被排除。重要的是,替代设计并未增加参与者主动退出率。
  • 隐性样本损失与精度:在BG复制中,前测-后测和区块随机化在无样本损失时提供超过30%的精度增益,且即使样本量减半仍优于标准设计。在TH复制中,两种替代设计在无损失时提供约25%的精度增益;区块随机化在20%样本损失时仍略优于满样本标准设计;前测-后测在近50%样本损失时仍保持优势。在DH复制中,区块随机化在≤10%样本损失时与满样本标准设计精度相当,但前测-后测设计即使无损失也表现更差(标准误大约15%),归因于小样本(约210人/设计)和弱相关(r=0.28)的准前测测量。
  • 样本组成:在TH中,前测-后测设计与标准设计的样本组成无差异;区块随机化设计仅在24个指标中的1个上存在差异。
  • 后测流失:未发现替代设计与标准设计在后测流失率上有差异;在TH中,44个人口统计指标中仅4个显示处理组间流失模式差异,且其中3个表明替代设计处理组的流失更少。
  • 零结果与意外发现:DH复制中前测-后测设计的意外较差表现是主要意外发现,作者归因于采样变异性和弱相关的前测测量。

Limitations

  • 仅复制了三项实验,推广性有限
  • 只能评估已观测的前测协变量,无法排除未观测特征导致的样本组成差异
  • DH复制中前测-后测设计的意外结果可能受小样本和采样变异影响
  • 准前测测量(DH)与真实前测测量的差异可能影响结果
  • 无法完全排除相关样本损失引入偏误的可能性(作者在补充材料中讨论了此问题)

Key Contributions

  • 首次用真实实验数据系统评估区块随机化和前测-后测设计在面临样本损失时的精度表现
  • 提出并区分了“显性样本损失”和“隐性样本损失”两个概念,为理解设计选择的实践约束提供了分析框架
  • 证明精度增益可以承受显著样本损失,为应用研究者提供了关于设计投资回报的实证依据
  • 发现设计选择的情境依赖性——前测信息可用性、统计功效和样本特征共同决定替代设计是否值得实施
  • 提供了高层级决策指导(补充材料Section H),帮助研究者在标准设计与替代设计之间做出更明智的选择

Key Claims

"In this letter, we put the theoretical benefits of these alternative designs to the test using real-world data. We replicate three published experiments, randomizing participants to counterfactual designs to explore the consequences of implementing these designs in practice for sample loss, increased precision, and more." (Section 1, Introduction)

"We use real-world data to demonstrate a counterintuitive result: precision gains from block-randomized or pre-post designs can withstand significant sample loss that may arise during implementation." (Abstract)

"In sum, the decision to implement a block randomized and/or pre-post design is context-dependent and should be informed by practical and statistical considerations." (Section 5, Conclusion)

"The first question to consider is whether pre-treatment information is already available at the level of randomization. If so, researchers can leverage this data to improve statistical precision without concerns about sample loss." (Section 5, Conclusion)

"If not sufficiently powered, collecting pre-treatment information to implement a block randomized and/or pre-post design ought to be considered as these designs may offer precision gains that outweigh even sizeable implicit and explicit sample loss." (Section 5, Conclusion)


My Notes